-
数据湖系列(2) - Iceberg 核心功能原理剖析 Liao Jiayi #Iceberg#Data Lake 上一篇文章中讲解了关于 Hudi 的基本概念和功能原理,Hudi 利用主键索引的方法来实现了 Upsert 的语义。Apache Iceberg 也是一个广为应用的数据湖框架,虽然两个框架的设计初衷和思路不同,但如今随着需求逐步丰富,两者对于使用者来说,却是越来越趋于一致了。
-
数据湖系列(1) - Hudi 核心功能原理剖析 Liao Jiayi #Hudi#Data Lake 随着互联网业务的逐步成熟,数仓和模型训练的基本盘逐步稳固,越来越多的工程师从业务开发需求转移到了工程的架构升级,而常用的 Hudi 和 Iceberg 往往会成为替代 Hive/Hdfs 等架构升级的选型。
-
为什么我们需要数据湖? Liao Jiayi #Data Lake 近两年,为什么都开始谈论起 Data Lake 这个"新名词"了?其实还是用户需求驱动数据服务,大家开始关注 Data Lake 的根本原因是用户需求发生了质变,过去的数据仓库模式以及涉及到的相关组件没有办法满足日益进步的用户需求。
-
Hudi Liao Jiayi #Hudi#Data Lake 自己关于 Apache Hudi 的一些简单的了解。Hudi 是 Uber 主导开发的开源数据湖框架。所以大部分的出发点都来源于 Uber 自身场景,比如司机数据和乘客数据通过订单 Id 来做 Join 等。